AI Agent为什么总是不稳定?终于有了一个系统性基准来拆解
AI Agent为什么总是不稳定?终于有了一个系统性基准来拆解三星大模型团队联合北京大学、香港城市大学、香港科技大学等科研机构,共同发布了面向 AI Agent 的基准测试 LiveClawBench。它关注的并不是「谁的 Agent 更强」,而是一个更基础、也更关键的问题:为什么同一个 AI Agent,在一些任务中已经接近可用,而在另一些任务中却会突然失稳?
搜索
三星大模型团队联合北京大学、香港城市大学、香港科技大学等科研机构,共同发布了面向 AI Agent 的基准测试 LiveClawBench。它关注的并不是「谁的 Agent 更强」,而是一个更基础、也更关键的问题:为什么同一个 AI Agent,在一些任务中已经接近可用,而在另一些任务中却会突然失稳?
今晚,我在旧金山 Howard Street 的 Inngest 总部,参加了一场叫做 {AI} in Production 的小型聚会。主办方是 Inngest,Cursor、Arcade、Vapi 联合参与。清一色是在一线真正跑 AI agent 的工程师和创始人,一群人坐在一起,讲他们把 AI 部署进生产环境之后遇到的真实问题。
最近这段时间,国内外模型更新得很快。
最近,flowith 团队发布了一款叫 Matrix 的产品,要帮你解决这个问题:主打用 Agent 开一家「无人公司」。说白了,就是你当老板设个目标,剩下的调研、生产、发布、获客,交给一整套 AI 员工去跑。它想干的事,听起来有点狂:让每个人都能开一家不需要员工的公司,然后这家公司真的能赚钱。
当 Agent 从演示视频中的炫技片段开始走进真实工作流与生产环境,下一阶段的「何去何从」成为业界关注的焦点。
当大模型应用进入深水区,决定一个 Agent 体验上限的,早已不只是 "答得对不对", 而是 "能不能持续记住同一个人"。
本篇文章根据我在本月 43 Talks 线下活动中的分享整理而成。主理人李继刚邀请我时,给的主题词只有一个:Context。我想从 Agent 的视角出发,讨论一个判断:随着模型和 Harness 逐步趋同,真正决定 Agent 能力边界的,会越来越是 Context。
微信和企业微信的 Agent,同时出牌。
AI高考志愿填报,数据只是最基础的一环。
近日,Hermes Agent上线了MoA(Mixture of Agents)功能,支持用户自由组合多种模型作为虚拟模型使用,在Nous Research即将发布的基准测试中,这个混合模型的评分超过了Opus 4.8 和GPT-5.5。